融资5000万美元,Patronus AI 要做AI Agent的压力测试场 | News
融资5000万美元,Patronus AI 要做AI Agent的压力测试场 | NewsAI Agent正在从“会回答”走向“能办事”,但真正的门槛也随之出现:它们能不能在复杂、漫长、不可预测的任务里持续做对?这家公司正在为AIAgent搭建一套“数字世界”测试场,让它们在真正接管网页、企业系统或金融流程前,先在模拟环境里反复试错、暴露漏洞。
搜索
AI Agent正在从“会回答”走向“能办事”,但真正的门槛也随之出现:它们能不能在复杂、漫长、不可预测的任务里持续做对?这家公司正在为AIAgent搭建一套“数字世界”测试场,让它们在真正接管网页、企业系统或金融流程前,先在模拟环境里反复试错、暴露漏洞。
Greg Isenberg 最近在他自己的播客 The Startup Ideas Podcast 里讲的一个判断,他说了一句很直白的话,building agents is the new SaaS,做 agent 就是新时代的 SaaS。
有人把 YC 2026 春季批次的 launch,一家不落地全看了一遍。196 家公司,395 个创始人,上周刚 Demo Day。95% 的公司沾 AI,70% 在做 agent。可它们的定位,没有一家是「我们用了 AI」。区别只在于,这句「换掉人」,被包装成了几种不同的话术。
两个月的时间,混元 3 正式版上线。结合了用户对预览版的反馈以及对模型稳定性和可用性的提升,Hy3 在 Agent 和 Coding 能力上有了实质的提升。我们做了多个前端网页的生成测试,大多数都包含复杂的 3D 网页模拟、严格的游戏逻辑,以及需要调用不同的框架和库文件,Hy3 交付的内容要比预览版好上一个等级。
上周有个项目,让我觉得很有意思。GitHub上一个叫OpenSquilla的,发布不到一个月,Star涨到了5300多。OpenSquilla 0.4.0,定位Token-Efficient AI Agent,是一个很有效率又很有创意的智能体框架。
为了解决这一问题,来自 University of Arizona、Zoom 与 Stony Brook University 的研究团队推出了 VISTA(VIsual Spec-To-App Benchmark), 首个面向 Visual Spec-to-Web-App Coding Agents 的端到端 Benchmark。
据DeepSeek官方API文档及GitHub仓库信息,一款名为Deep Code的第三方开源AI编程助手近日被收录进DeepSeek Agent工具。该工具面向DeepSeek-V4系列模型做了适配,支持深度思考、推理强度控制、Agent Skills以及MCP集成。截至发稿,Deep Code GitHub仓库显示,该工具收获超1500星、127 fork。
这几天,我们把一群平均年龄只有 19 岁的人召集到一起。几天之后,我们意识到,这可能是一次提前到来的未来。他们来自不同地方,有人做模型、做 agent、做机器人,有人做硬件、做开发者工具,有人还在上学,有人则已经在真实产品里承担核心工作。这里面有一批人已经站在今天 AI 最前沿的地方,参与过很多人正在使用、讨论、追赶的基座模型。
这个官方仓库vercel-labs/skills,发布仅五个月,GitHub星标就冲到了2.4万。凭什么这么火?简单到只有一行命令:npx skills add <package>。说白了,它就是AI智能体(AI agent)的包管理器。
如果是小白第一次上手,我会更建议从 Kimi 开始。Kimi 的中文理解、长文本处理、Coding、多模态综合能力都很强,是最适合 Codex 的国产模型。今天这篇内容,手把手教大家如何将第三方大模型接入 Codex 搞定日常任务。